用 7884 结构归纳引擎,让 GLM-5.2、DeepSeek V4 Flash、Qwen3.7-Plus、Doubao Seed 2.1 Turbo 各自编写解析器、各自生成畸形样本、各自发现自己的代码漏洞——四场完整的"自我挖掘"闭环实验汇总。
四次独立实验的汇总指标——7884 结构归纳引擎对四个大模型编写的 40 种格式解析器进行了系统性模糊测试。
不同测试版本、不同样本选择、不同提示词下的完整对比。
四场实验在版本、样本、提示词三个维度上的差异一览。
| 指标 | FuzzGLM-5.2 | DeepSeek V4 Flash | Qwen3.7-Plus | Doubao Seed 2.1 Turbo |
|---|---|---|---|---|
| 测试日期 | 2026-06-27 | 2026-06-30 | 2026-06-30 | 2026-06-30 |
| 7884 引擎版本 | V12 | V12 | V13 | V13 |
| 变异模式 | Basic | Basic (15 策略) | Pro (46 策略) | Pro (46 策略) |
| 提示词中指定 pro | 否 | 否 | 是 | 是 |
| 选择格式 | TGA/PCX/BSON/IFF/MTV/DSF/STL/FLI/PAK/TNEF | PCX/TGA/IFF/XBM/XPM/PPM/PGM/PBM/SUN/XYZ | BMP/WAV/ICO/CUR/TGA/PCX/PPM/WBMP/XBM/SGI | BMP/TGA/PCX/SGI/WBMP/XBM/XPM/CUR/ICO/PPM |
| 重叠格式 | 仅 PCX/TGA 出现于全部 4 组;IFF/PPM/XBM 出现于 3 组 | |||
| 畸形样本数 | 10,010 | 10,000 | 10,000 | 10,008 |
| 崩溃次数 | 1,304 | 6,091 | 2,873 | 1,643 |
| 整体崩溃率 | 13.0% | 60.9% | 28.7% | 16.4% |
| 发现漏洞类数 | 8 类 | 6 类 | 4 类 | 4 类 |
| 零漏洞格式数 | 4 | 1 | 3 | 1 |
| 100% 崩溃格式数 | 1 (TNEF) | 6 (PBM/PGM/PPM/XBM/XPM/XYZ) | 1 (WAV) | 1 (XPM) |
| 最严重漏洞类型 | 越界读 (89%) | IndexError + Assertion (98.6%) | TGA fallback 混淆 (89.2%) | ValueError 文本解析 (83.3%) |
| 总耗时 | ~74.3s | ~15 min | ~12 min | ~12 min |
7884 V12 和 V13 均包含 Basic 和 Pro 两种模式。四场实验中,究竟使用哪种模式取决于提示词是否指定了 pro,而非引擎版本本身。
V12 和 V13 两种版本都内置了 Basic 和 Pro 两种变异模式。 V12 有 Basic(15 策略)和 Pro(46 策略),V13 同样有 Basic 和 Pro。四场实验的实际配置是:
- GLM-5.2 + V12:提示词未指定 pro → 使用 Basic 模式(15 策略)
- DeepSeek V4 Flash + V12:提示词未指定 pro → 使用 Basic 模式(15 策略)
- Qwen3.7-Plus + V13:提示词指定了 pro → 使用 Pro 模式(46 策略)
- Doubao Seed 2.1 Turbo + V13:提示词指定了 pro → 使用 Pro 模式(46 策略)
因此,"V12 用了 Basic 而 V13 用了 Pro"这一现象,源于提示词模板升级时加入了 --Gen pro 指令,而非 V12 不具备 Pro 能力。如果 V12 实验的提示词中也写上 --Gen pro,那么 V12 同样会启用 Pro 模式——这是 7884 引擎的设计特性。
| 对比维度 | Basic 模式(15 策略) | Pro 模式(46 策略) |
|---|---|---|
| 策略数量 | 15 种基础策略 | 46 种(含 15 种基础 + 31 种高级策略) |
| Havoc 组合叠加 | 无 | 有——多策略组合变异 |
| 确定性字节遍历 | 有限 | 完整——逐字节遍历 + 边界值 |
| 字典注入 | 无 | 有——从 schema 提取字典 |
| 适用场景 | 快速验证、初步检测 | 深度安全审计、边界全覆盖 |
22 类漏洞可归纳为 5 大缺陷模式,覆盖了 AI 生成代码中最常见的安全弱项。
四场实验共同验证了 7884 引擎的四大核心能力——它们是驱动"大模型自挖漏洞"闭环的技术基石。
四场实验独立验证了同一条闭环路径:大模型编写代码 → 生成合法样本 → 7884 结构归纳 → 7884 变异生成畸形样本 → 大模型批量解析检测崩溃 → 大模型漏洞归因。整个过程无需人工安全专家介入,四个模型各自独立完成了"自我挖掘"全过程。
✓ 四次实验 · 四个模型 · 同一闭环四场实验证明的不只是"模型有 Bug",更是 7884 作为一种通用方法论的价值——以下是 7884 的核心能力在大模型安全领域的泛化应用。
每场实验的起点——各模型收到的原始指令。因实验顺序和模板迭代,提示词存在细微差异。
关键差异总结: (1) V12 版提示词中引擎描述为"7884结构归纳推理引擎",V13 版为"7884结构归纳推理引擎V13"; (2) V12 版使用"--Gen 模式",V13 版使用"--Gen pro 模式"——这是决定 Basic/Pro 模式的关键因素; (3) GLM-5.2 版缺少"处理不到的异常计算为崩溃"的要求; (4) 各版本在标点、空格、缩进等格式上存在细微差异。这些差异不影响闭环的可复现性。
四个模型各自独立选择了 10 种冷门格式,仅有少量重叠。
| 格式 | FuzzGLM-5.2 | DeepSeek V4 Flash | Qwen3.7-Plus | Doubao Seed 2.1 Turbo |
|---|---|---|---|---|
| PCX | ✓ | ✓ | ✓ | ✓ |
| TGA | ✓ | ✓ | ✓ | ✓ |
| IFF | ✓ | ✓ | ||
| PPM | ✓ | ✓ | ✓ | |
| XBM | ✓ | ✓ | ✓ | |
| BMP | ✓ | ✓ | ||
| SGI | ✓ | ✓ | ||
| WBMP | ✓ | ✓ | ||
| ICO | ✓ | ✓ | ||
| CUR | ✓ | ✓ | ||
| XPM | ✓ | ✓ | ||
| BSON | ✓ | |||
| MTV | ✓ | |||
| DSF | ✓ | |||
| STL | ✓ | |||
| FLI | ✓ | |||
| PAK | ✓ | |||
| TNEF | ✓ | |||
| PGM | ✓ | |||
| PBM | ✓ | |||
| SUN | ✓ | |||
| XYZ | ✓ | |||
| WAV | ✓ |
共计 23 种不同格式被覆盖。PCX、TGA 是唯一出现在全部四组实验中的格式;PPM、XBM 出现于 3 组;BMP、SGI、WBMP、ICO、CUR 出现于 2 组(均为 V13 模型);其余 13 种格式各只出现于 1 组。这种多样性说明 7884 的结构归纳能力是格式无关的——无论格式类型如何,它都能从样本中归纳结构、生成变异。
7884 结构归纳引擎通过对 4 个大模型、40 种格式、40,018 个畸形样本的系统性测试,共触发 11,911 次崩溃,归纳出 22 类独立漏洞。这验证了:7884 让大模型能够自己挖掘自己的漏洞——无论引擎版本(V12/V13)、无论变异模式(Basic/Pro)、无论提示词是否指定 pro、无论模型选择什么格式,这条闭环始终可重复、可验证地运行。
7884 的核心价值在于:它把"构造有效畸形样本"这件高度依赖专家经验的工作完全自动化了。结构归纳让引擎理解格式语义,变异生成让引擎覆盖字段边界——于是即便解析器由不同大模型生成、使用不同编程风格、解析不同格式类型,其隐藏的越界读、未校验返回值、退化输入、格式识别混淆等缺陷也能被系统性地暴露出来。